Language Models are Few-Shot Learners (2020 论文)
概述
GPT-3 论文,展示 1750 亿参数语言模型的涌现能力和少样本学习范式。
关键内容
- 规模扩展:GPT-3 将参数扩展到 1750 亿,展示了模型规模与能力之间的幂律关系。
- 涌现能力:当模型达到临界规模时,涌现出训练时未明确教授的能力,如推理、代码生成、数学计算等。
- 少样本提示:通过少量示例(few-shot prompting)即可引导模型完成新任务,改变了人机交互范式。
来源
- ai_papers_timeline.md — 2020 年时间线条目